<!DOCTYPE html>
<html class="client-nojs vector-feature-language-in-header-enabled vector-feature-language-in-main-page-header-disabled vector-feature-page-tools-pinned-disabled vector-feature-toc-pinned-clientpref-0 vector-toc-not-available vector-feature-main-menu-pinned-disabled vector-feature-limited-width-clientpref-1 vector-feature-limited-width-content-enabled vector-feature-custom-font-size-clientpref-1 vector-feature-appearance-pinned-clientpref-0 skin-theme-clientpref-day vector-sticky-header-enabled" lang="de" dir="ltr"><head>
<meta charset="UTF-8">
<title>Cluster (Datenanalyse)</title>
<meta name="viewport" content="width=device-width, initial-scale=1.0">
<link rel="icon" type="image/png" href="./_res_/favicon.png">
<link rel="canonical" href="https://de.wikipedia.org/wiki/Cluster_(Datenanalyse)"> <link href="./_mw_/ext.cite.styles.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.math.styles.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.wikimediamessages.styles.css" rel="stylesheet" type="text/css">
<link href="./_mw_/skins.vector.icons.css" rel="stylesheet" type="text/css">
<link href="./_mw_/skins.vector.search.codex.styles.css" rel="stylesheet" type="text/css">
<link href="./_mw_/skins.vector.styles.css" rel="stylesheet" type="text/css">
<meta name="ResourceLoaderDynamicStyles" content="">
<link href="./_mw_/ext.gadget.citeRef.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.defaultPlainlinks.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiCommonHide.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiCommonLayout.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiCommonStyle.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiDarkmode.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiResponsive.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.specialSearch.css" rel="stylesheet" type="text/css">
<link rel="stylesheet" type="text/css" href="./_mw_/site.styles.css">
<link rel="stylesheet" type="text/css" href="./_mw_/noscript.css">
<link rel="stylesheet" type="text/css" href="./_res_/footer.css">
<link rel="stylesheet" type="text/css" href="./_res_/vector-2022.css">
</head>
<body class="skin--responsive skin-vector skin-vector-search-vue mediawiki ltr sitedir-ltr mw-hide-empty-elt ns-0 ns-subject page-Cluster_Datenanalyse rootpage-Cluster_Datenanalyse skin-vector-2022 action-view">
<div class="mw-page-container">
<div class="mw-page-container-inner">
<div class="mw-content-container">
<main id="content" class="mw-body">
<header class="mw-body-header vector-page-titlebar">
<h1 id="firstHeading" class="firstHeading mw-first-heading"><span class="mw-page-title-main">Cluster (Datenanalyse)</span></h1>
</header>
<a id="top"></a>
<div id="bodyContent" class="vector-body ve-init-mw-desktopArticleTarget-targetContainer" aria-labelledby="firstHeading" data-mw-ve-target-container="">
<div id="contentSub">
<div id="mw-content-subtitle"></div>
</div>
<div id="mw-content-text" class="mw-body-content mw-content-ltr" lang="de" dir="ltr"><div class="mw-content-ltr mw-parser-output" lang="de" dir="ltr"><p>Als <b>Cluster</b> (gelegentlich auch <i>Ballungen</i>) bezeichnet man in der <a href="Informatik" title="Informatik">Informatik</a> und <a href="Statistik" title="Statistik">Statistik</a> eine <i>Gruppe</i> von Datenobjekten mit ähnlichen Eigenschaften. Die Zuordnung von Daten zu den in einem Datensatz gefundenen Clustern bezeichnet man als <b>Clustering</b>. Verfahren zum Auffinden von solchen Gruppen bezeichnet man als <a href="Clusteranalyse" title="Clusteranalyse">Clusteranalyse</a>. Nicht zu einem Cluster gehörende Datenobjekte bezeichnet man als <a href="Ausrei%C3%9Fer" title="Ausreißer">Ausreißer</a> (<a href="Englische_Sprache" title="Englische Sprache">englisch</a> <i>outlier</i>) oder Rauschen (<a href="Englische_Sprache" title="Englische Sprache">englisch</a> <i>noise</i>).
</p><p>Die Kernidee eines Clusters ist, dass Objekte im selben Cluster über „ähnliche“ Eigenschaften verfügen und sich dadurch von Objekten, die nicht in diesem Cluster sind, unterscheiden.
</p>
<div class="mw-heading mw-heading2"><h2 id="Clusterzugehörigkeit"><span id="Clusterzugeh.C3.B6rigkeit"></span>Clusterzugehörigkeit</h2></div>
<p>Bereits bei der Clusterzugehörigkeit gibt es unterschiedliche Formulierungen.
</p>
<ul><li>Bei einem <b>harten Clustering</b> gehört jedes Datenobjekt ganz oder gar nicht zu einem Cluster.</li>
<li>Bei einem <b>weichen Clustering</b> gehört jedes Datenobjekt zu einem gewissen Anteil zu einem Cluster.</li></ul>
<p>Des Weiteren kann man unterscheiden:
</p>
<ul><li>Bei einem <b>strikt partitionierenden Clustering</b> gehört jedes Datenobjekt zu genau einem Cluster.</li>
<li>Bei einem <b>strikt partitionierenden Clustering mit Ausreißern</b> kann ein Datenobjekt auch zu keinem Cluster gehören (bei einem weichen Clustering dürfen sich die Anteile auch zu weniger als 1 summieren).</li>
<li>Bei einem <b>überlappenden Clustering</b> kann ein Objekt auch zu mehreren Clustern gehören (bei einem weichen Clustering dürfen sich die Anteile auch zu mehr als 1 summieren).</li></ul>
<p>Auch innerhalb von Clustern kann es Untergruppen geben, die einander ähnlicher sind als dem Rest der größeren Gruppe. Hat man eine derartige Struktur, so spricht man von <b>hierarchischen Clustern</b> bzw. einem <b>hierarchischen Clustering</b>. Verfahren, die hierarchische Cluster finden können, sind beispielsweise <a href="Hierarchische_Clusteranalyse" title="Hierarchische Clusteranalyse">Hierarchische Clusteranalyse</a>, <a href="OPTICS" title="OPTICS">OPTICS</a> und <a href="BIRCH" title="BIRCH">BIRCH</a>.
</p>
<div class="mw-heading mw-heading2"><h2 id="Modelle_von_Clustern">Modelle von Clustern</h2></div>
<p>Verschiedene Algorithmen zur Clusteranalyse verwenden oft unterschiedliche Begriffe von Clustern. Dies führt oftmals zu Verständnisproblemen, da die Ergebnisse eines Verfahrens nicht im Sinne eines anderen Verfahrens ähnlich sein müssen.
</p><p>So beschreibt der <a href="K-Means-Algorithmus" title="K-Means-Algorithmus">k-Means-Algorithmus</a> Cluster durch ihre Mittelpunkte (bzw. die daraus entstehenden <a href="Voronoi-Diagramm" title="Voronoi-Diagramm">Voronoi-Zellen</a>), der <a href="EM-Algorithmus" title="EM-Algorithmus">EM-Algorithmus</a> Cluster durch Mittelpunkt und eine <a href="Kovarianzmatrix" title="Kovarianzmatrix">Kovarianzmatrix</a>, während <a href="DBSCAN" title="DBSCAN">DBSCAN</a> "dichte-verbundene" Mengen beliebiger Form als Cluster berechnet.
</p><p>Je nach verwendetem Clusterbegriff können unterschiedliche Strukturen gefunden oder auch nicht gefunden werden. In dem hier gezeigten Beispiel können die vorhandenen Cluster vom k-Means-Algorithmus durch dessen Cluster-Modell nicht akkurat gefunden werden. Das komplexere Modell des EM-Algorithmus hingegen eignet sich optimal, um diese Daten zu beschreiben, da sie von einer <a href="Normalverteilung" title="Normalverteilung">Normalverteilung</a> erzeugt wurden.
</p>
<div class="mw-heading mw-heading2"><h2 id="Subspace-Cluster">Subspace-Cluster</h2></div>
<p>Als <b>Subspace-Cluster</b> bezeichnet man einen Cluster, der nicht in allen Attributen oder Attributkombinationen auffällig ist. Erst wenn die Daten geeignet projiziert werden, erkennt man die höhere Ähnlichkeit der Clusterobjekte im Vergleich zu den anderen.
</p><p>Bei Subspace-Clustern kann man unterscheiden zwischen <i>Achsenparallelen Clustern</i> (basierend auf einer Attributauswahl) und beliebig orientierten <i>Correlation-Clustern</i>.
</p><p>Verfahren für Subspace-Clusterverfahren sind beispielsweise CLIQUE, ORCLUS, SubClu, PreDeCon, PROCLUS, HiSC, HiCO, 4C, ERiC und CASH.
</p>
<div class="mw-heading mw-heading2"><h2 id="Berechnung_von_Clustern">Berechnung von Clustern</h2></div>
<div class="hauptartikel" role="navigation"><span class="hauptartikel-pfeil" title="siehe" aria-hidden="true" role="presentation">→ </span><i><span class="hauptartikel-text">Hauptartikel</span>: <a href="Clusteranalyse" title="Clusteranalyse">Clusteranalyse</a></i></div>
<p>Es gibt zahlreiche Verfahren (sogenannte Clusteranalyse-Algorithmen) zur Berechnung von Clustern. Diese unterscheiden sich wesentlich darin, was für Modelle sie für Cluster verwenden. Bei vielen klassischen Verfahren wie dem <a href="K-Means-Algorithmus" title="K-Means-Algorithmus">k-Means-Algorithmus</a>, dem <a href="EM-Algorithmus" title="EM-Algorithmus">EM-Algorithmus</a>, der hierarchischen Clusteranalyse und <a href="DBSCAN" title="DBSCAN">DBSCAN</a> steht das Cluster-Modell im Vordergrund, und es gibt zum Teil mehrere konkrete <a href="Algorithmus" title="Algorithmus">Algorithmen</a>, eine (zumindest lokal) optimale Lösung für dieses Modell zu finden. Viele neuere Verfahren hingegen haben kein entsprechend klar definiertes Modell mehr.
</p>
<div class="mw-heading mw-heading2"><h2 id="Bewertung_von_Clustern">Bewertung von Clustern</h2></div>
<p>Die Bewertung von gefundenen Clustern ist kein einfaches Problem, insbesondere, wenn die Cluster aus unterschiedlichen Verfahren stammen. Es besteht die Gefahr der <a href="%C3%9Cberanpassung" title="Überanpassung">Überanpassung</a>, wenn die Bewertungsmethode einem der verwendeten Verfahren zu ähnlich ist – das bedeutet, man untersucht letztlich, welches Verfahren der Bewertungsmethode am ähnlichsten ist.
</p>
<div class="mw-heading mw-heading3"><h3 id="Interne_Bewertung">Interne Bewertung</h3></div>
<p>Von einer <i>internen</i> Bewertung spricht man, wenn zur Bewertung keine zusätzlichen Informationen verwendet werden, sondern lediglich die Objekte des Datensatzes zur Bewertung verwendet werden. Typischerweise verwendet man hierzu Distanzmaße, beispielsweise die durchschnittliche Distanz zweier Clusterobjekte zueinander. Die interne Bewertung bevorzugt normalerweise Clusteringergebnisse, die nach demselben Modell erstellt wurden. So haben beispielsweise von <span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle k}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mi>k</mi>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle k}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/c3c9a2c7b599b37105512c5d570edc034056dd40.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -0.338ex; width:1.211ex; height:2.176ex;" alt="{\displaystyle k}" loading="lazy"></span>-Means gefundene Cluster natürlicherweise geringere durchschnittliche Abstände als DBSCAN-Cluster.
Daher ist diese Art der Bewertung vor allem sinnvoll, wenn man unterschiedliche Ergebnisse des gleichen Verfahrens bewerten will, beispielsweise von mehreren Läufen eines randomisierten Verfahrens wie dem <span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle k}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mi>k</mi>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle k}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/c3c9a2c7b599b37105512c5d570edc034056dd40.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -0.338ex; width:1.211ex; height:2.176ex;" alt="{\displaystyle k}" loading="lazy"></span>-Means-Algorithmus. Ein von der Anzahl der Cluster unabhängiges internes Maß zur Bewertung von distanzbasierten Clusterings stellt der <a href="Silhouettenkoeffizient" title="Silhouettenkoeffizient">Silhouettenkoeffizient</a> dar. Er eignet sich vor allem dazu, Ergebnisse von <span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle k}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mi>k</mi>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle k}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/c3c9a2c7b599b37105512c5d570edc034056dd40.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -0.338ex; width:1.211ex; height:2.176ex;" alt="{\displaystyle k}" loading="lazy"></span>-Means mit unterschiedlichen Werten von <span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle k}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mi>k</mi>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle k}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/c3c9a2c7b599b37105512c5d570edc034056dd40.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -0.338ex; width:1.211ex; height:2.176ex;" alt="{\displaystyle k}" loading="lazy"></span> zu vergleichen, da er von der Clusteranzahl <span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle k}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mi>k</mi>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle k}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/c3c9a2c7b599b37105512c5d570edc034056dd40.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -0.338ex; width:1.211ex; height:2.176ex;" alt="{\displaystyle k}" loading="lazy"></span> unabhängig ist.
</p>
<div class="mw-heading mw-heading3"><h3 id="Externe_Bewertung">Externe Bewertung</h3></div>
<p>Bei der <i>externen</i> Bewertung wird Information hinzugenommen, die nicht während der Clusteranalyse verwendet wurde. Existiert beispielsweise eine <a href="Klasseneinteilung_(Statistik)" title="Klasseneinteilung (Statistik)">Klasseneinteilung</a> der Daten, so kann die Übereinstimmung des Clusters mit einer Klasse zur Bewertung verwendet werden. Die Probleme bei diesem Ansatz liegen darin, dass zum einen nicht immer eine geeignete Information zur Verfügung steht, zum anderen das Ziel der Clusteranalyse eben genau die Entdeckung von neuer Struktur ist, und die Bewertung anhand einer bekannten Struktur daher nur bedingt sinnvoll ist. Des Weiteren können in den Daten mehrere, sich überlappende Strukturen existieren.<sup id="cite_ref-1" class="reference"><a href="#cite_note-1"><span class="cite-bracket">[</span>1<span class="cite-bracket">]</span></a></sup> Durch die Koppelung an die bestehende Klasseneinteilung bevorzugt diese Bewertung informierte Verfahren aus dem Bereich des <a href="Maschinelles_Lernen" title="Maschinelles Lernen">Maschinellen Lernen</a> gegenüber uninformierten Verfahren aus der (echten) <a href="Clusteranalyse" title="Clusteranalyse">Clusteranalyse</a>.
</p>
<div class="mw-heading mw-heading2"><h2 id="Siehe_auch">Siehe auch</h2></div>
<ul><li><a href="Data-Mining" title="Data-Mining">Data-Mining</a></li>
<li><a href="Knowledge_Discovery_in_Databases" title="Knowledge Discovery in Databases">Knowledge Discovery in Databases</a></li>
<li><a href="Multivariate_Verfahren" title="Multivariate Verfahren">Multivariate Verfahren</a></li>
<li><a href="Klasseneinteilung_(Statistik)" title="Klasseneinteilung (Statistik)">Klasseneinteilung</a></li></ul>
<div class="mw-heading mw-heading2"><h2 id="Einzelnachweise">Einzelnachweise</h2></div>
<ol class="references">
<li id="cite_note-1"><span class="mw-cite-backlink"><a href="#cite_ref-1">↑</a></span> <span class="reference-text">I. Färber, S. Günnemann, <a href="Hans-Peter_Kriegel" title="Hans-Peter Kriegel">H.-P. Kriegel</a>, P. Kröger, E. Müller, E. Schubert, T. Seidl, A. Zimek: <cite style="font-style:italic">On Using Class-Labels in Evaluation of Clusterings</cite>. In: <cite style="font-style:italic">MultiClust: 1st International Workshop on Discovering, Summarizing and Using Multiple Clusterings Held in Conjunction with KDD 2010, Washington, DC</cite>. 2010 (<a rel="nofollow" class="external text" href="https://www.dbs.ifi.lmu.de/~zimek/publications/MultiClustAtKDD2010/Faerberetal.pdf">lmu.de</a> [PDF]).<span class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&rfr_id=info:sid/de.wikipedia.org:Cluster+%28Datenanalyse%29&rft.atitle=On+Using+Class-Labels+in+Evaluation+of+Clusterings&rft.au=I.+F%C3%A4rber%2C+S.+G%C3%BCnnemann%2C+H.-P.+Kriegel%2C+...&rft.btitle=MultiClust%3A+1st+International+Workshop+on+Discovering%2C+Summarizing+and+Using+Multiple+Clusterings+Held+in+Conjunction+with+KDD+2010%2C+Washington%2C+DC&rft.date=2010&rft.genre=book" style="display:none"> </span></span>
</li>
</ol>
<div class="mw-heading mw-heading2"><h2 id="Literatur">Literatur</h2></div>
<ul><li>Martin Ester, Jörg Sander: <cite style="font-style:italic">Knowledge Discovery in Databases. Techniken und Anwendungen</cite>. <a href="Springer_Nature" title="Springer Nature">Springer Nature</a>, Berlin 2000, ISBN 3-540-67328-8.<span class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&rfr_id=info:sid/de.wikipedia.org:Cluster+%28Datenanalyse%29&rft.au=Martin+Ester%2C+J%C3%B6rg+Sander&rft.btitle=Knowledge+Discovery+in+Databases.+Techniken+und+Anwendungen&rft.date=2000&rft.genre=book&rft.isbn=3540673288&rft.place=Berlin&rft.pub=Springer+Nature" style="display:none"> </span></li></ul></div><!--htdig_noindex--><div><div class="zim-footer">
Dieser Artikel wurde von <a class="external text" title="Zuletzt bearbeitet am 2025-08-19" href="https://de.wikipedia.org/wiki/?title=Cluster_(Datenanalyse)&oldid=259005311">Wikipedia</a> herausgegeben. Der Text ist unter <a class="external text" href="https://creativecommons.org/licenses/by-sa/4.0/deed.de">Creative Commons Attribution-Share Alike 4.0</a> verfügbar, sofern nicht anders angegeben. Für die Mediendateien können zusätzliche Bedingungen gelten.
</div>
</div><!--/htdig_noindex--></div>
</div>
</main>
</div>
</div>
</div>
<script src="./_webp_/webpHandler.js"></script>
</body></html>